메뉴

#로컬 LLM

HN
Hacker News • 4일 전
IMP 6

Show HN: Lossless-memory – 요약하지 않는 개인 AI 장기 기억 시스템

개인 AI 어시스턴트를 위한 로컬 기반 장기 기억 시스템으로, 대화를 요약하거나 벡터 검색만으로 압축하지 않고 모든 원문 로그를 타임스탬프와 함께 그대로 보관합니다. 시간 표현을 이해하는 단일 검색 진입점과 '현재 주제'를 알려주는 소형 인덱스(LLL)를 통해 문맥 압축과 세션 경계를 넘어 정체성과 맥락을 유지합니다. JSONL 로그 + SQLite(FTS5, sqlite-vec) 기반의 1인용·단일 머신 구현체입니다.

AI 메모리 장기 기억 로컬 LLM
MP
MarkTechPost • 8일 전
IMP 6

2026년 로컬 LLM을 위한 최고의 오픈소스 에이전트 하니스

Ollama, LM Studio, llama.cpp와 호환되는 오픈소스 에이전트 하니스(agent harness) 11종을 라이선스와 설정 방법까지 검증하여 소개하는 글입니다. 로컬 LLM으로 자율 에이전트를 구축하려는 개발자에게 실무적 선택 가이드로 유용합니다.

로컬 LLM 에이전트 하니스 오픈소스
HN
Hacker News • 8일 전
IMP 7

본사이 2 27B, 9배 작은 용량으로 거의 무손실 압축

PrismML이 삼진법(trinary) 가중치 기반의 'Ternary Bonsai 2 27B'를 공개했습니다. Qwen3.8 27B를 기반으로 하며, 전체 원본 모델 대비 9배 이상 작은 5.9GB 크기로 벤치마크 성능의 98.2%를 유지합니다. 로컬 기기에서 코딩 에이전트, 컴퓨터 사용, 멀티모달 작업 등 실질적인 지식 노동이 가능해졌다는 점에서 주목할 만합니다.

모델 압축 로컬 LLM 오픈소스
HN
Hacker News • 22일 전
IMP 5

TERMy – LLM 없이 동작하는 빠른 터미널 어시스턴트 공개

PJON 개발자가 AI 비용 인상에 대응해 자택 하드웨어(GTX 1050 Ti)로 소형 transformer를 직접 학습해 보았지만 결과가 만족스럽지 않자, LLM 없이 결정론적(deterministic) 방식으로 동작하는 터미널 어시스턴트 'TERMy'를 개발했습니다. 간단한 자연어 명령을 빠르고 저렴하게 처리하는 것이 목표로, 단순 반복 작업에 거대 모델이 불필요하다는 점을 보여준다는 점에서 주목할 만합니다.

터미널 도구 소형 언어모델 로컬 LLM
HN
Hacker News • 24일 전
IMP 6

M4 Pro 맥 미니로 구축한 로컬 LLM 서버

48GB RAM을 갖춘 M4 Pro 맥 미니에서 Qwen3.6-35B와 Gemma-4 모델을 oMLX 추론 서버로 구동하고, Tailscale로 아이폰·맥북을 연결해 에이전트 백엔드로 활용하는 방법을 소개합니다. 클라우드 API의 가격 변동, 데이터 프라이버시, AI 주권 리스크를 피하고 비용 예측성과 지연 감소, 오프라인 사용 등의 실용적 이점을 얻을 수 있다는 것이 핵심입니다. GPT-5나 Claude Opus가 필요한 나머지 20%를 제외한 일상 요청의 80%를 무료로 처리하는 것이 목적입니다.

로컬 LLM 맥 미니 oMLX
WR
Wired AI • 28일 전
IMP 6

내 컴퓨터에서 챗봇 직접 실행하는 법

ChatGPT 등을 구동하는 대규모 언어 모델(LLM)은 클라우드 없이 자신의 컴퓨터에서 직접 실행할 수 있다. 오프라인 사용과 높은 프라이버시, 구독료 없는 무료 활용이 장점이다. LM Studio, Ollama 등의 무료 도구와 Hugging Face의 모델을 활용하면 누구나 쉽게 로컬 AI 환경을 구축할 수 있다.

로컬 LLM LM Studio Ollama
HN
Hacker News • 33일 전
IMP 7

나와 함께 스카이림을 플레이하는 저지연 AI 동료를 만들었다

개발자가 LLM으로 스카이림 내 NPC '바르코스'를 실시간 음성 동료로 조작하는 시스템을 구축했습니다. 조건부·다단계 명령 수행, 아이템 검색, 숨바꼭질, 전투 등 월드 상태에 기반한 복잡한 행동을 지연 없이 수행하며, 가능한 한 로컬 LLM으로 실행해 프라이버시와 비용 문제를 해결합니다. LLM 게임 NPC의 약점인 세계 개입성(world agency)과 지연 시간 문제를 해결한 사례로 주목받습니다.

게임 AI LLM 에이전트 저지연
MP
MarkTechPost • 34일 전
IMP 6

FreeToken: 워크스테이션 GPU 하나로 753B GLM-5.2를 돌리는 엣지 네이티브 MoE 서빙 엔진

FreeToken은 MoE(Mixture-of-Experts) 모델의 캐시 미스 발생 시, 실측 대역폭을 기반으로 PCIe를 통한 가중치 적재와 CPU 실행을 분배하는 엣지 네이티브 서빙 엔진입니다. 이를 통해 753B 파라미터급 GLM-5.2 같은 초대형 모델을 단일 워크스테이션 GPU에서 로컬로 실행할 수 있게 됩니다. 고성능 하드웨어 없이도 최첨단 모델을 온프레미스 환경에서 활용하려는 실무자에게 중요한 기술입니다.

MoE (혼합 전문가) 엣지 추론 로컬 LLM
HN
Hacker News • 34일 전
IMP 6

로컬 LLM이 실제보다 멍청해 보이는 이유

로컬에서 실행하는 LLM이 원래 성능보다 떨어져 보이는 이유는 하드웨어·소프트웨어 구현 차이가 토큰 확률 분포를 왜곡하기 때문이라는 기술 분석 글입니다. 저자는 동일한 가중치라도 GPU 세대별 명령어 집합과 양자화, 샘플러 설정이 출력 품질에 큰 영향을 준다고 설명하며, KLD(KL Divergence)로 이 편차를 측정하는 방법을 소개합니다. 로컬 LLM 운영자에게 벤치마크와 샘플러 설정의 중요성을 일깨워주는 실용적인 글입니다.

로컬 LLM 추론 최적화 양자화
HN
Hacker News • 36일 전
IMP 4

별도 로컬 LLM으로 Claude 5의 토큰 쏟아내기 정리하기

Vomit은 Claude Code가 출력하는 장황한 '토큰 토사물'을 로컬 LLM을 거쳐 자연스러운 영어로 변환해주는 오픈소스 도구입니다. 완전 로컬에서 동작해 외부 의존성이나 텔레메트리가 없으며, Claude의 출력을 후킹(hook)으로 교체하거나 비침투 모드로 사이드에서 감시할 수 있습니다.

Claude Code 로컬 LLM 오픈소스
HN
Hacker News • 38일 전
IMP 6

Shoehorn – 어떤 모델이든 내 컴퓨터에 맞게 양자화해 실행

Shoehorn은 사용자의 하드웨어 메모리 예산에 맞춰 허깅페이스(Hugging Face) 인기 모델들을 양자화(quantize)하여 로컬에서 실행할 수 있게 해주는 오픈소스 도구입니다. 브라우저에서 내 장비에 맞는 모델을 스캔해 품질 순으로 보여주고, llama.cpp를 백엔드로 사용해 원 클릭으로 채팅까지 가능합니다. 맥(macOS), 리눅스, 윈도우를 지원하며 Homebrew나 바이너리 다운로드로 설치할 수 있습니다.

로컬 LLM 양자화 llama.cpp
HN
Hacker News • 43일 전
IMP 7

주말 10달러로 메이커를 위한 50만 도메인 검색 엔진 만들기

거대 기업의 SEO와 문서에 묻히지 않고, 개인 프로젝트와 창작물만 찾아주는 맞춤형 검색 엔진을 주말 단기로 구축한 사례입니다. 로컬 소형 언어 모델을 활용해 웹페이지를 요약하고 분류하며, 약 10달러의 GPU 서버 비용으로 50만 개 이상의 사이트 인덱스를 구축할 수 있었습니다. 개인 개발자가 AI를 활용해 기존 검색 엔진의 한계를 뛰어넘는 효율적인 로컬 도구를 만드는 데 훌륭한 영감을 제공합니다.

로컬 LLM 검색 엔진 LLM 에이전트
HN
Hacker News • 44일 전
IMP 6

C언어로 작성된 초경량 터미널 코딩 에이전트, Hax

Hax는 단일 C 바이너리로 구동되는 초경량 터미널 코딩 에이전트로, 시스템 메모리를 거의 차지하지 않아 로컬 LLM 구동에 유리합니다. 복잡한 플러그인 기능을 배제하고 유닉스 철학에 입각해 가벼움과 투명성에 집중한 것이 특징이며, 주로 터미널 환경과 로컬 모델을 선호하는 개발자들을 위한 도구입니다.

코딩 에이전트 오픈소스 터미널
HN
Hacker News • 68일 전
IMP 7

엔비디아 DGX 스파크 일상 사용기

엔비디아 직원이 자비로 구매한 DGX 스파크의 실사용 경험을 공유했습니다. 초소형 폼팩터와 뛰어난 전력 효율에도 불구하고 일반적인 웹 서핑, 프로그래밍은 물론 게이밍과 로컬 LLM 구동까지 훌륭한 성능을 보여주는 올라운더 ARM 기반 워크스테이션입니다. 가격 대비 성능은 다소 아쉽지만, 조용하고 발열이 적어 데스크탑 메인 PC로도 손색이 없는 것이 특징입니다.

엔비디아 DGX 스파크 로컬 LLM
HN
Hacker News • 71일 전
IMP 8

LM Studio 바이오닉: 오픈 모델 기반 AI 에이전트

LM Studio가 코딩, 문서 작업 등 실질적인 업무를 수행할 수 있는 전용 AI 에이전트 '바이오닉(Bionic)'을 출시했습니다. 이 도구는 로컬 모델과 클라우드의 오픈소스 모델을 유연하게 활용하면서도, 철저한 데이터 비보존(Zero Data Retention) 정책을 통해 개인정보 보호와 비용 통제를 지원하는 것이 핵심입니다. 특히 로컬 음성 입력, 에이전트 기반의 코드 검색 및 문서 샌드박스 작업 등 개인과 기업 실무자에게 매우 유용한 기능을 제공합니다.

로컬 LLM AI 에이전트 데이터 프라이버시
HN
Hacker News • 76일 전
IMP 7

맥 스튜디오에서 대규모 AI 모델 구동을 위한 3가지 버그 수정

M3 맥 스튜디오 얼트라 환경에서 5만 토큰 이상의 긴 대화 컨텍스트를 처리할 때 첫 토큰 생성까지 수 분이 걸리던 치명적인 지연 문제를 해결한 사례입니다. 저자는 DS4 Flash 모델에서 지연 시간이 더 짧은 Qwen 3.5 122B로 교체하고, 하이브리드 어텐션 구조로 인한 캐시 메모리 누수 등 서빙 스택의 버그 3가지를 직접 수정하여 로컬 환경에서도 실사용이 가능한 에이전트 코딩 환경을 구축했습니다. 로컬 LLM 최적화 및 Mac 하드웨어 활용에 관심 있는 개발자들에게 매우 유용한 기술적 인사이트를 제공합니다.

로컬 LLM 맥 스튜디오 추론 최적화
HN
Hacker News • 96일 전
IMP 6

Qwen 3 0.6B 모델 파인튜닝으로 질문 분류하기

저자는 가사 관련 챗봇의 검색 정확도(RAG)를 높이기 위해 6억 개(0.6B)의 매개변수를 가진 초소형 로컬 LLM인 Qwen 3:0.6B를 파인튜닝하여 질문을 카테고리별로 분류하는 실험을 진행했습니다. 미세조정 전 원본 모델의 정답률은 10%에 불과했으나, Unsloth 프레임워크와 약 850개의 데이터를 활용해 학습을 진행하여 신뢰할 수 있는 분류기를 구축할 수 있었음을 보여줍니다.

로컬 LLM 파인튜닝 RAG
HN
Hacker News • 98일 전
IMP 7

구형 제온 서버 174번 재부팅하며 찾아낸 최적 LLM 추론 옵션

10년 된 구형 CPU 환경에서 LLM(Gemma 4)을 빠르게 구동하기 위해 추론 엔진의 25개 명령어 플래그(flags)를 하나씩 제거하며 성능 변화를 측정한 실험 결과입니다. 플래그들은 하드웨어나 작업량에 따라 상호작용하므로 무작정 복사해서 붙여넣기보다 실제 환경에서 테스트해야 함을 보여줍니다. 하드웨어 제약 없이 오픈소스 모델을 최적화하려는 실무자들에게 매우 유용한 가이드입니다.

로컬 LLM llama.cpp 성능 최적화
HN
Hacker News • 99일 전
IMP 8

DGX Spark 하나에 두 개의 Qwen3 모델 구동하기

DGX Spark(GB10) 단일 하드웨어에 vLLM과 LiteLLM을 활용해 대형 모델(Qwen3-Next-80B)과 소형 모델(Qwen3-4B)을 동시에 띄우는 고군분투기를 다룹니다. 단순 OOM 문제부터 vLLM의 메모리 할당 방식, 그리고 Qwen3 모델의 도구 호출 에이전트 연동 시 발생하는 치명적인 파싱 및 추론 모드 문제를 해결하는 과정을 담고 있습니다.

vLLM 로컬 LLM Qwen3
HN
Hacker News • 102일 전
IMP 7

일상 코딩, 클로드/GPT 대신 로컬 모델로 교체하신 분?

해커뉴스에서 클로드나 GPT 대신 로컬 AI 모델을 실제 일상 코딩에 적용한 사례를 묻는 질문이 올라왔습니다. 질문자는 단순한 테스트용이 아닌 메인 개발 도구로 완전히 전환한 사용자들의 환경 세팅과 토큰 생성 속도(tok/s) 등 성능 정보를 공유해달라고 요청했습니다. 개발자들의 실무 적용 사례를 통해 상용 API를 대체할 수 있는 오픈소스 모델의 현재 성능과 한계를 파악하는 데 도움이 되는 중요한 스레드입니다.

로컬 모델 코딩 AI 오픈소스
HN
Hacker News • 113일 전
IMP 7

1995년도 스타일로 글쓰는 LLM 파인튜닝

이 글은 90년대 소프트웨어 기술 문서의 문체를 모방하는 로컬 LLM을 파인튜닝하는 과정을 다룹니다. 저자는 마이크로소프트의 과거 매뉴얼 데이터를 활용해 스타일을 전달하는 실험을 진행하며, RAG 대신 파인튜닝을 선택한 이유와 저비용으로 로컬 환경에서 모델을 세밀하게 조정할 수 있는 방법을 설명합니다. 이는 실무자들에게 AI의 스타일 학습 가능성과 효율적인 데이터 활용법을 보여줍니다.

파인튜닝 로컬 LLM 스타일 전송
HN
Hacker News • 114일 전
IMP 7

로컬 LLM을 위한 영구 기억 계층, Mnemo

대화가 끝나면 모든 기억을 잃는 LLM의 한계를 극복하기 위해 개발된 로컬 우선(local-first) AI 메모리 계층입니다. SQLite와 petgraph를 활용해 오프라인 환경에서도 지식 그래프를 구축하고, 50ms 미만의 속도로 관련 문맥을 자동 추출하여 프롬프트에 주입합니다. 클라우드 없이 단일 바이너리로 작동하며, OpenAI, Anthropic, Ollama 등 다양한 환경과 호환된다는 것이 특징입니다.

로컬 LLM 지식 그래프 오픈소스
MP
MarkTechPost • 120일 전
IMP 6

리퀴드 AI, 128K 컨텍스트 지원 온디바이스 MoE 모델 공개

리퀴드 AI는 일반 소비자용 하드웨어에서도 구동 가능한 온디바이스용 MoE 모델인 LFM2.5-8B-A1B를 발표했습니다. 이 모델은 총 83억 개(8.3B)의 파라미터를 보유하고 있으면서도 연산 시 15억 개(1.5B)만 활성화하여 효율적인 추론을 자랑합니다. 최대 12만 8천(128K) 토큰의 긴 컨텍스트 처리와 고급 추론, 그리고 도구 호출(Tool calling) 기능을 지원하는 것이 특징입니다.

온디바이스 AI MoE 리퀴드 AI
LL
r/LocalLLaMA • 128일 전
IMP 7

Qwen 3.6 35B 양자화 벤치마크: NTP vs MTP

ByteShape가 Qwen 3.6 35B 모델의 NTP(기존)와 MTP 방식 GGUF 양자화 결과를 공개했습니다. GPU 환경에서는 MTP 방식이 토큰 생성 속도를 최대 20~40% 향상시켰으나, CPU 환경에서는 오히려 성능 저하가 발생해 NTP 사용을 권장합니다. 또한 무조건 낮은 압축률(bpw)을 선택하기보다, 메모리가 허용하는 한 더 큰 용량의 모델을 쓰는 것이 속도와 품질 면에서 유리한 결과를 보였습니다.

로컬 LLM 양자화(GGUF) 벤치마크
HN
Hacker News • 132일 전
IMP 8

DeepSeek-V4-Flash: LLM 스티어링(조종)이 다시 흥미로워진 이유

오픈소스 로컬 모델인 DeepSeek-V4-Flash의 등장으로, 모델의 내부 상태를 직접 제어하여 출력을 유도하는 '스티어링(Steering)' 기술이 실용화 단계에 접어들었습니다. 개발자 antirez가 이 모델 기반으로 스티어링을 내장한 'DwarfStar 4' 프로젝트를 발표하며, 프롬프트 엔지니어링에 의존하지 않고 모델의 뇌를 직접 제어하는 방식에 대한 기대감이 높아지고 있습니다.

DeepSeek-V4-Flash 스티어링(Steering) 로컬 LLM
LL
r/LocalLLaMA • 133일 전
IMP 7

로컬 LLM에 실시간 금융 데이터를 제공하는 오픈소스 MCP 서버

로컬 환경에서 구동되는 AI 에이전트에 실시간 금융 데이터를 제공하는 셀프 호스팅 오픈소스 MCP 서버가 공개되었습니다. 별도의 클라우드 의존성이나 API 키 없이 SEC 공시, 기관 및 내부자 거래, 경제 지표 등의 데이터를 직접 스크래핑하여 Claude, Cursor 등 MCP 지원 클라이언트에서 즉시 활용할 수 있어, 로컬 LLM 기반의 금융 분석 에이전트 개발에 매우 유용합니다.

MCP 서버 로컬 LLM 오픈소스
HN
Hacker News • 134일 전
IMP 8

내 하드웨어에 최적화된 로컬 LLM 벤치마크 순위 추천

사용자의 GPU, CPU, RAM을 자동 감지하여 HuggingFace의 최신 모델 중 시스템에 맞는 최적의 로컬 LLM을 벤치마크 점수 기반으로 순위 매기는 오픈소스 CLI 도구입니다. 단순히 용량만 맞추는 것을 넘어 실제 성능 평가 지표와 최신성을 반영해 가장 우수한 모델을 추천하는 것이 특징입니다. 단 한 줄의 명령어로 추천 모델을 다운로드하고 즉시 채팅을 시작할 수 있어 로컬 환경 구축에 매우 유용합니다.

로컬 LLM 오픈소스 도구 하드웨어 최적화
LL
r/LocalLLaMA • 138일 전
IMP 8

ExLlamaV3 대규모 업데이트: DFlash 지원 및 속도 대폭 향상!

로컬 AI 추론 라이브러리인 ExLlamaV3가 대대적인 업데이트를 진행했습니다. 새로운 'DFlash' 기능을 지원하여 에이전트 및 코딩 작업에서 기존 대비 최대 3배 빠른 텍스트 생성 속도를 달성했습니다. 또한 Gemma 4 모델 지원을 추가하고, 주요 오픈소스 모델들에 대한 최적화를 통해 다양한 GPU 환경에서의 실행 효율성을 크게 높였습니다.

오픈소스 로컬 LLM 추론 최적화
LL
r/LocalLLaMA • 143일 전
IMP 6

밀집 모델 대결: 느린 게 더 빠르다?

이 글은 최신 소규모 밀집 모델인 Qwen3.6 27B의 성능을 이전 버전(Qwen3.5 27B) 및 Gemma 4 31B와 다각적으로 비교 평가합니다. 수학 및 세계 지식 벤치마크에서 Qwen3.6이 눈에 띄는 향상을 보였지만, 전반적인 비에이전트(Non-agentic) 과제와 지시어 수행 능력에서는 Gemma 4가 여전히 우수한 경쟁력을 입증했습니다. 실무적 관점에서 각 모델의 정확도와 효율성, 그리고 기대와 다른 벤치마크 결과의 이면을 확인할 수 있는 중요한 분석입니다.

오픈소스 모델 벤치마크 로컬 LLM
LL
r/LocalLLaMA • 147일 전
IMP 7

윈도우 네이티브 vLLM으로 RTX 3090서 Qwen3.6-27B 초당 72토큰 달성

Windows 환경에서 WSL이나 Docker 없이 네이티브로 구동되는 오픈소스 vLLM 패치 및 포터블 런처가 공개되었습니다. RTX 3090 단일 GPU에서 Qwen3.6-27B(INT4 양자화) 모델을 최대 초당 72토큰(tok/s) 속도로 실행할 수 있으며, 복잡한 파이썬 환경 설정 없이 간편하게 설치할 수 있다는 것이 핵심입니다. 3090/4090/5090 등 엔비디아 최신 아키텍처 사용자가 로컬 환경에서 대규모 언어 모델을 쉽고 빠르게 테스트해 볼 수 있는 실용적인 도구입니다.

vLLM 로컬 LLM Windows 네이티브